把思考折叠进序列:WeLM 617B MoE的隐式Scaling路径
把思考折叠进序列:WeLM 617B MoE的隐式Scaling路径新智元报道 大模型变强,过去靠两条路。 做大——Scaling Law出现后,参数从百亿推向千亿,算力支出一路飙升。 想久——o1带火思考模型,用更长的思维链、更多推理时间换结果。 问题是,除了Sca
来自主题: AI技术研报
8026 点击 2026-07-24 15:54
搜索
新智元报道 大模型变强,过去靠两条路。 做大——Scaling Law出现后,参数从百亿推向千亿,算力支出一路飙升。 想久——o1带火思考模型,用更长的思维链、更多推理时间换结果。 问题是,除了Sca